强化学习之父Richard Sutton给出一个简单思路,大幅增强所有RL算法
强化学习之父Richard Sutton给出一个简单思路,大幅增强所有RL算法在奖励中减去平均奖励
来自主题: AI技术研报
8946 点击 2024-11-01 12:43
搜索
在奖励中减去平均奖励
Richard Sutton 在 「The Bitter Lesson」中做过这样的评价:「从70年的人工智能研究中可以得出的最重要教训是,那些利用计算的通用方法最终是最有效的,而且优势巨大。」